Back
精读 MolmoAct:用深度感知 token、视觉轨迹 trace 与离散动作 token,把 VLA 的感知、规划和控制组织成可解释、可 steer 的三阶段推理。
paper deep dive
vla
spatial reasoning
robot manipulation
精读 InSpire:在动作生成前插入目标物体相对机器人方向的 VQA 桥接,用粗粒度空间推理抑制 VLA 的 shortcut learning 与 spurious correlation。
vision-language-action model
robot generalization